Skip to content

前沿实践:Cursor 如何确认 Claude Fable 5 能解决最难的 1% 问题

发布日期: 2026年7月17日

分类: Enterprise AI

来源: https://claude.com/blog/working-at-the-frontier-cursor


Cursor 是用于构建专业软件的 AI 编码 Agent。它除支持自身模型外,还支持所有主流前沿模型,因此能够相对中立地判断不同模型的真实表现。

维护这份“成绩单”的是工程师 Nate Schmidt。他在 Cursor 从事 eval 与模型行为工作:研究模型如何成功、如何失败,以及是什么让开发者在任务中途悄悄换掉一个模型。当同事或客户想了解新版本,都会来找他。

随着时间推移,Schmidt 团队发现公开 benchmark 分数与真实开发者对模型的接受程度已不再一致,于是构建了自己的评测:CursorBench。

CursorBench 专门捕捉工程师在真实场景中给模型的那些混乱、信息不足的 prompt。某个 eval task 只粘贴一段 stack trace 和一个单词“fix”,模型必须自行推断意图、找到根因并验证改动。另一个 task 会故意告诉模型错误模块坏了,以检验它会质疑用户假设,还是跟着走进死胡同。

Claude Fable 5 运行该 eval 时,在 Max effort 下得到 72.9%,创下新高,也展示了正确模型与 Agentic Coding 工具结合后能达到的能力。

Claude Fable 5 在 Max effort 下取得 72.9%,创下新高。

但在自己的工程工作流和个人测试中使用该模型时,Schmidt 已不必不断重复目标。持续“看护”模型,例如提醒上下文、讲清解决方案、审计结果,已不再必要。他可以直接交出问题,无论是一直拖延的棘手重构,还是对细微 edge case 的推理,Claude Fable 5 都能解决。

Schmidt 说:“我不觉得还要先帮 Claude Fable 5 搭起对我所处世界和我正解决问题的理解。它开箱即有这种感觉。”

对整个任务进行推理

Cursor 团队用 CursorBench 测试新模型时,答对只是基本要求;他们真正评分的是模型是否理解了它被要求做什么。

Schmidt 说:“很多 eval 的形式是:这里有个定义清晰的问题、这里是约束,去修复它。但真实用户给我们的 prompt 并不是这样。模型必须推断用户遇到了问题以及其想表达什么,识别根因、修复、验证修复,然后报告回来。”

Claude Fable 5 在这些模糊任务上表现太好,以至于 Cursor 团队开始怀疑:“要么模型非常聪明,要么它在作弊。”于是他们查看 trace,阅读模型对最困难任务的实际推理。这些任务的 prompt 看似简单,但解开它们要求理解整个系统。

Schmidt 说:“我们持续看到模型挖出以前没有其他模型能拿下的结果。”它完成同样工作所需的操作也更少,相对于完成的工作而言更具 Token 效率。

随后,Schmidt 把 Claude Fable 5 放到自己最喜欢的个人测试之一:登月。几周前,他将 Claude Opus 接到一个可编程太空飞行模拟器,只给一行 prompt,“造一枚火箭并在月球着陆”,然后让它在第二台显示器上运行 12 到 16 小时。模型会发射、在轨道上耗尽燃料、加更多燃料,随后又因火箭太重而无法冲出大气层。

他用同一条空白 prompt 重跑实验,这次使用 Claude Fable 5。几分钟后,火箭升空,停在低轨道后又返航,表面看起来是同样的失败;然后 Schmidt 读了 transcript。

“Fable 决定第一次尝试不直接登月。它先执行进入轨道、收集 telemetry 的初始任务,再用这些数据指导下一次飞行。”数次尝试后,第二台显示器上的发动机声停止,月球上出现了一台着陆器。整次运行只花数小时,而 Opus 运行超过 12 小时仍无结果。

Schmidt 说:“Opus 是局部推理,思考刚发生什么以及下一刻会发生什么;Fable 是全局推理,思考的是整个任务。”

Cursor 会让所有模型通过 CursorBench,即用于模拟真实开发者任务的内部 benchmark。

何时选择全局最优

Schmidt 已形成一条简单规则,决定何时使用 Claude Fable 5,而不是更便宜、能力较弱的模型。

他说:“如果你很清楚从 A 到 B 的路径,你可能不需要 Fable;如果你在 A 点却不知道 B 在哪里,Fable 是极好的选择。当我想把某件事用正确方式做好,Fable 是我第一个想到的模型。”

Claude Fable 5 也让团队能重新处理此前搁置的项目,例如大家都认为应该重写、但无人能证明值得花数周时间的项目,因为模型已能承担足够多的基础工作。Schmidt 说:“它降低了启动此类任务的心理和资源门槛,让我们可以去寻找全局最优,而不只是局部最优。”

它还改变了团队协调方式。Cursor 团队精简,个人责任强,很少开 standup。现在,Schmidt 在动共享代码前会让 Agent 阅读队友最近提交并标出冲突,双方都不必暂停手中工作专门同步。

为平衡成本与性能,团队让 Claude Fable 5 与更快、更轻的模型搭配:日常工作交给小模型,只有能力才是瓶颈的问题才交给 Fable。在这种配置下,他认为该组合是他们运行过最有效的方案。

他说:“遇到极其棘手的问题,也就是问题分布的 p99 时,我要优化的是到达解法的时间。我认为 Fable 是解决我们最难问题的最佳模型。”

Nate Schmidt 会通过多种 eval 测试新模型,其中包括让模型在太空飞行模拟器中接受考验。

下一步

即使已让模型通过 CursorBench、并把它送上月球,Schmidt 仍在寻找 Claude Fable 5 的极限。接下来他想验证模型能无人值守地管理 back-end system 多久,数天到数周的运行是下一项实验。Cursor 内部也正使用它主动发现性能瓶颈和用户痛点,而不是等待报告;同时构建更复杂、更接近现实的 eval 环境,以衡量下一代能力。

他说:“有一类问题,人们过去甚至不会考虑,因为看起来无从下手。有了 Fable,我很期待去推动这个边界。”

开始使用 Claude Fable

AI 落地咨询
艾维禾砺数字科技

企业 AI 落地全链路服务

Agent 开发工作流搭建Claude Code 集成
微信咨询
d187l8801b6124
访问官网 ivheli.com